摘要:大模型训练并不是选择一个框架就结束了。训练目标、参数更新方式、上层工作流、分布式执行和在线生成分别由不同技术负责。本文从学习视角梳理主流训练方法与框架分层,解释它们如何组合,并给出按任务、开发方式和硬件规模进行选型的思路。
关键词:大模型训练、SFT、DPO、PPO、GRPO、LoRA、QLoRA、TRL、LLaMA-Factory、Axolotl、Unsloth、Open-R1、verl、DeepSpeed、FSDP、Megatron-Core
本文基于 2026 年 8 月可查的官方资料整理。开源框架更新很快,具体参数和支持矩阵请以项目对应版本的官方文档为准。
一、先建立大模型训练的全景图
一个模型从“基础模型”走向“可用助手”,可能经历如下过程:
1 | 海量原始文本、代码、多模态数据 |
这不是每个项目都必须完整执行的流水线。实际情况可能是:
- 企业客服模型:基座模型 → SFT → DPO;
- 数学推理模型:基座模型 → 推理轨迹 SFT → GRPO;
- 行业知识模型:基座模型 → 继续预训练 → SFT;
- 小型本地模型:基座模型 → QLoRA SFT → 量化部署;
- 从零训练基础模型:数据工程 → 大规模预训练 → 多阶段后训练。
因此,第一原则是:先确定训练阶段,再选择框架。
